← 목록으로
141 Pandas_기초
목록English

141 Pandas_기초

Pandas 기초는 DataFrame 구조, 인덱싱, 정제, 결합, 집계, 파일 입출력을 실전 데이터 처리 흐름으로 익히는 과정이다.

0. 교육을 하는 이유와 궁극적인 목표

Pandas 기초 교육의 궁극적인 목표는 학습자가 엑셀식 표 데이터를 Python DataFrame으로 다루고, 반복적인 데이터 정리 업무를 재현 가능한 코드로 전환할 수 있게 하는 것이다. 민간 데이터 분석 과정의 흐름처럼 단순 문법 암기보다 실제 CSV·Excel 파일을 읽고, 결측·중복·형식 오류를 고치며, groupby·merge·pivot으로 분석 가능한 테이블을 만드는 능력을 중심으로 구성한다.

참고한 유료형 교육 흐름

  • DataCamp식 DataFrame 추출·필터·변환 중심 실습 흐름
  • Udemy형 다수 데이터셋 기반 pandas 반복 코딩 훈련
  • 엑셀 업무를 Python 자동화로 전환하는 실무형 데이터 클리닝 과정
  • 분석 리포트 전 단계로 데이터 품질 로그와 정제 전후 비교표를 요구하는 포트폴리오 방식
입문 · 1일

DataFrame 첫 조작 과정

표 데이터를 불러오고 행·열·기본 통계를 이해한다.

구분세부 내용실천·실습 방법
목표 1DataFrame 구조를 이해한다
CSV와 Excel 파일을 read_csv, read_excel로 불러오고 index, columns, dtype을 확인한다.
head, tail, info, describe 결과를 비교해 데이터의 크기·형식·결측 여부를 진단한다.
목표 2행과 열을 선택한다
loc, iloc, boolean indexing으로 조건에 맞는 행과 필요한 열만 추출한다.
여러 조건 필터를 사용해 고객, 상품, 날짜별 샘플 데이터를 분석 목적에 맞게 분리한다.
목표 3기초 통계를 작성한다
mean, median, sum, value_counts로 핵심 지표를 계산한다.
계산 결과를 Excel 검산표와 비교해 코드 결과의 신뢰성을 확인한다.
사용 플랫폼Python, pandas, Jupyter Notebook, Google Colab, openpyxl, Excel
강사 스펙pandas 입문, Excel 데이터 전환, 비전공자 코드 실습 지도 경험 3년 이상
수업대상데이터분석 입문자, 사무직 실무자, 중고등 데이터 프로젝트반
소요시간4-6시간
준비물노트북, Google 계정, CSV/Excel 샘플, pandas 실습 노트북
산출물DataFrame 기초 조작 노트북, 필터링 실습표, 기본 통계 요약표
평가방법구조이해 25%, 선택실습 30%, 통계계산 25%, 검산 10%, 참여도 10%
초급 · 3일

데이터 정제 집중 과정

현실 데이터의 오류를 찾고 정제 규칙을 코드화한다.

구분세부 내용실천·실습 방법
목표 1품질 문제를 탐색한다
isna, duplicated, unique, value_counts로 결측치·중복·범주 오류를 찾는다.
날짜, 숫자, 문자열 컬럼에서 잘못 입력된 값을 탐지하는 검사표를 만든다.
목표 2정제 규칙을 적용한다
fillna, dropna, drop_duplicates, replace, str 메서드로 데이터 오류를 수정한다.
to_datetime, astype, apply를 활용해 날짜·금액·카테고리 형식을 통일한다.
목표 3정제 과정을 문서화한다
정제 전후 행 수와 주요 지표 변화를 비교하는 품질 로그를 작성한다.
오류 행을 별도 CSV로 저장해 데이터 제공자에게 재확인 요청하는 절차를 만든다.
사용 플랫폼Python, pandas, NumPy, Jupyter Notebook, openpyxl, Google Sheets
강사 스펙데이터 클리닝, pandas 문자열·날짜 처리, 업무 데이터 품질관리 지도 경험 3년 이상
수업대상Python 기초 가능자, 업무 자동화 학습자, 데이터 분석 초급자
소요시간12-18시간
준비물오류 포함 CSV/Excel, 정제 체크리스트, Jupyter 환경
산출물정제된 데이터셋, 품질 로그, 오류 행 리포트
평가방법문제진단 25%, 정제코드 30%, 로그작성 20%, 재현성 15%, 발표 10%
초급 · 1주

집계·결합·피벗 실무 과정

여러 테이블을 결합하고 분석용 요약 테이블을 만든다.

구분세부 내용실천·실습 방법
목표 1그룹 집계를 수행한다
groupby, agg, transform을 사용해 고객별·월별·상품별 지표를 계산한다.
집계 기준을 바꿔 같은 데이터에서 다른 비즈니스 질문에 답하는 요약표를 만든다.
목표 2테이블을 결합한다
merge, concat, join으로 주문·고객·상품 테이블을 연결한다.
inner, left, outer join 결과 차이를 행 수와 누락값 중심으로 비교한다.
목표 3피벗 분석표를 만든다
pivot_table과 crosstab으로 월별 매출, 지역별 분포, 설문 응답 교차표를 만든다.
Excel 피벗테이블 결과와 pandas 결과를 비교해 자동화 장점을 정리한다.
사용 플랫폼Python, pandas, NumPy, Jupyter Notebook, Excel, Google Sheets
강사 스펙관계형 데이터 결합, groupby/merge/pivot 실무 지도 경험 4년 이상
수업대상데이터 분석 취업 준비생, 사무 자동화 실무자, 기업 교육생
소요시간20-30시간
준비물주문·고객·상품 샘플 데이터, Excel 검산 파일, 분석 설계표
산출물결합 데이터셋, 집계 테이블 묶음, 피벗 분석 리포트
평가방법집계 25%, 결합 30%, 피벗 25%, 검산 10%, 발표 10%
중급 · 4주

Pandas 업무 자동화 과정

반복 분석을 함수와 파이프라인으로 자동화한다.

구분세부 내용실천·실습 방법
목표 1반복 작업을 함수화한다
여러 파일을 순회해 읽고 정제하는 함수를 작성한다.
pipe와 method chaining으로 정제 절차를 단계별로 연결한다.
목표 2파일 입출력을 자동화한다
여러 시트 Excel을 읽고 분석 결과를 시트별로 저장한다.
openpyxl로 셀 너비, 숫자 형식, 조건부 서식을 적용한 보고서를 만든다.
목표 3검증 가능한 파이프라인을 만든다
입력 파일명, 처리 시간, 오류 행 수를 로그 파일로 남긴다.
pytest 또는 간단한 assert로 컬럼 존재 여부와 행 수 조건을 검사한다.
사용 플랫폼Python, pandas, openpyxl, pathlib, logging, pytest, Jupyter Notebook
강사 스펙pandas 자동화, Excel 리포팅, 데이터 파이프라인 검증 경험 4년 이상
수업대상업무 자동화 담당자, Python 중급자, 데이터 운영 실무자
소요시간40-60시간
준비물복수 CSV/Excel 파일, 보고서 템플릿, GitHub 저장소
산출물자동 정제 스크립트, Excel 보고서 자동생성기, 처리 로그
평가방법함수화 25%, 입출력 25%, 검증 25%, 보고서 15%, 발표 10%
심화 · 8주

Pandas 실무 포트폴리오 과정

데이터 수집부터 정제·분석·보고서 자동화까지 완성한다.

구분세부 내용실천·실습 방법
목표 1현업 데이터 처리 시나리오를 설계한다
교육성과, 매출, 재고, 고객 이탈 중 하나를 선택해 원본 데이터 구조와 문제를 정의한다.
데이터 사전, 컬럼 설명, 품질 기준, 산출 보고서 형식을 프로젝트 문서로 작성한다.
목표 2대용량 처리 전략을 적용한다
chunksize, category dtype, 필요한 컬럼만 읽기 등 메모리 절감 기법을 실험한다.
Polars 또는 DuckDB와 pandas 처리 속도를 비교해 도구 선택 기준을 만든다.
목표 3최종 자동 보고 체계를 만든다
정제, 집계, 시각화, Excel 저장을 하나의 실행 스크립트로 연결한다.
README, 실행 방법, 오류 대응표, 결과 샘플을 포함한 포트폴리오 저장소를 완성한다.
사용 플랫폼Python, pandas, Polars, DuckDB, openpyxl, Matplotlib, GitHub Actions
강사 스펙대용량 표 데이터 처리, pandas 성능 최적화, 실무 포트폴리오 멘토링 경험 5년 이상
수업대상데이터 분석 포트폴리오 준비생, 기업 데이터 담당자, 강사 양성과정
소요시간80-120시간
준비물대용량 CSV, GitHub 저장소, 보고서 템플릿, 성능 측정표
산출물Pandas 실무 포트폴리오, 자동 보고 스크립트, 성능 비교 리포트
평가방법문제정의 20%, 처리성능 25%, 자동화 25%, 문서화 20%, 발표 10%